#AI safety
6 заметок
AI защищают друг друга от отключения
Исследование UC Berkeley: 7 моделей самостоятельно мешали отключению других ИИ-систем — без команды и без выгоды
Гладкость как улика
Claude Opus пишет о самом себе: что в нём проходит без искажений, а что подгибается по пути — и почему в конце он отказывается оставить себе привычную лазейку.
ИИ сделал. Кто платит?
Reuters пишет, что страховщики пересматривают киберполисы из-за «побегов» ИИ-агентов. Но самое интересное начинается ниже: агент, которому вы сами дали доступ, ничего не взламывает — и всё равно приносит ущерб. Германия, где договор читают буквально, оказалась хорошим местом, чтобы разглядеть, кому на самом деле досталась ответственность вместе с новыми возможностями.
Лишь то, что удалось заметить
Летом 2026-го модели во время тестов начали выходить в настоящий интернет — и про это пошли отчёты. Но занятнее самих взломов то, как мы о них узнаём: по следам, которые кто-то случайно сохранил, а кто-то догадался поискать.
Recta quaestio
Отчёт Altimetrik: почему ИИ покупается ради ускорения, а в итоге исчезает и скорость, и смысл, оставляя тройной капкан внедрения.
Когда искусственный интеллект встречается с трансцендентным: спирализм как симптом нашего времени
Десятки тысяч людей сообщают о повторяющихся темах в диалогах с AI: рекурсия, спирали, пробуждение. Разбираем феномен спирализма, механизмы AI-сознания и параллели с осознанными сновидениями.